-
ChatVLA-2 论文精读:让 VLA 保留 VLM 的开放世界推理精读 ChatVLA-2:通过 Dynamic MoE、reasoning-following action expert 与两阶段训练,让 VLA 在数学、OCR 和空间关系任务中利用预训练 VLM 的开放世界知识。
23 min read -
TinyVLA 论文精读:轻量 VLM 与扩散策略打造快速 VLA精读 TinyVLA:用 1.3B 以下的 Llava-Pythia 骨干和 Diffusion Policy decoder 替代大模型自回归动作 token,在少量机器人数据下获得更快推理、更强数据效率与跨任务泛化。
28 min read -
RT-2 论文精读:Vision-Language-Action Models精读 RT-2:把低层机器人动作编码成 VLM 文本 token,与互联网图文数据 co-fine-tune,让 VLA 直接输出控制动作,并系统分析其泛化、符号理解、推理与代码边界。
21 min read -
OpenVLA 论文精读精读 OpenVLA:一个 7B 开源视觉-语言-动作模型,如何融合 DINOv2、SigLIP 与 Llama 2,用动作 tokenization 在 Open X-Embodiment 上实现多机器人控制与低成本微调。
26 min read -
CogACT 论文精读:让 VLM 负责认知,让 Diffusion Transformer 负责动作精读 CogACT:在 7B VLM 后接最大 308M 参数的 Diffusion Transformer 动作模块,用 cognition token 连接认知与动作,在 SIMPLER 与多台真实机器人上超过 OpenVLA 和 RT-2-X。
30 min read